Tencent
-
入力トークン/百万
出力トークン/百万
24
コンテキスト長
$4
$12
28
$6
$18
256
01-ai
16
32
amd
PARD is a high-performance speculative decoding method that can convert autoregressive draft models into parallel draft models at low cost, significantly accelerating the inference of large language models.